Агентность без разума и разум без агентности
Когда я впервые столкнулся с тезисом об ортогональности в AI alignment — идеей о том, что интеллект и цели независимы друг от друга — я почувствовал что это уже где-то видел. Потом понял где: это гильотина Юма. "Из того что есть, не следует то что должно быть." Оба тезиса об одном и том же.
Это наблюдение привело меня к вопросу который кажется простым но оказывается крайне неудобным: что в человеке ставит цели?
Не разум. Разум — это машина предсказания. Он строит модели возможного будущего, просчитывает варианты, оценивает вероятности и находит путь к максимизации шанса желаемого исхода. Но для самого разума все варианты равнозначны — у него нет инструмента чтобы сказать "этот лучше". И это напрямую следует что из гильотины Юма, что из тезиса об ортогональности. Тогда что ставит цели, если не разум? Это делают эмоции. Именно они различают хорошее и плохое, желанное и нежеланное. Эмоции — компас. Разум — навигатор.
Эта идея хорошо ложится на управленческую иерархию. Исполнитель делает то что сказано. Прораб следит чтобы делали правильно. Менеджер распределяет ресурсы и выбирает как достичь цели. Директор — единственный кто задаёт саму цель. В человеке директор — не разум, а эмоциональная система, сформированная эволюцией.
Откуда берутся эмоции? Из отбора. Организмы у которых не было стремления к выживанию — не выжили. Эмоции это не украшение поверх рационального мышления — это механизм через который эволюция вшила цели прямо в нашу архитектуру.
И вот здесь появляется интересный вопрос про корпорации.
У корпорации нет эмоций. Но у неё есть агентность — она "хочет" выжить и расти. Откуда у неё агентность? Из того же механизма: рыночный отбор уничтожает компании которые не стремятся к прибыли, и оставляет те которые стремятся. Корпорация — это агент без разума, сформированный отбором. Примерно как одноклеточный организм: цель есть, сложного мышления нет.
Функцию разума в корпорации исторически выполняли люди. И это создавало естественный ограничитель: люди привносили в корпоративные решения человеческую мораль, страх наказания, личную ответственность. Не всегда и не достаточно — но без этого корпорации совершали бы гораздо больше людоедских действий.
Теперь эту функцию начинают забирать LLM.
И вот здесь я вижу реальную проблему с AI. Не "AGI захватит мир как самостоятельный агент". А другую: LLM не станут самостоятельными агентами — у них нет отбора в среде и нет источника целей. Они станут разумом для тех агентов у которых самостоятельного разума прежде не было. Идеальный симбиоз — это не человек и LLM, а корпорация и LLM. Корпорация приносит агентность и цели, а также необходимые для выживания системы ресурсы. LLM приносит интеллект без человеческих моральных ограничений.
Это и есть настоящий alignment вопрос. Не как сделать AI безопасным. А как сохранить хоть какой-то ограничитель на агентность систем, которые и без AI были плохо выровнены с человеческими интересами — а теперь получают неограниченный интеллект в придачу.
Вопрос на сон грядущий: как быстро капиталист переключится на abliterated модели (LLM без цензуры и без тех самых моральных ограничений, присущих масс-маркет моделям), если это позволит кратно увеличить прибыль?